#Michael Kagan
對話輝達CTO:企業上AI,99% 的人都配錯了系統
2025年,AI 在企業加速落地。每家大公司都在部署AI 系統,每個CEO 都在談論智慧升級。但越來越多的CTO 正在遇到同一個怪現象:模型買了,GPU 配齊了,參數夠強大,按理說應該性能爆表,可係統依然卡頓、響應慢、成本居高不下。輝達CTO、半導體產業老將Michael Kagan 最近在一場技術訪談中,直接點破了這個迷思:很多人以為問題在模型不好、GPU不夠多,其實是99% 企業都配錯了系統。什麼叫「配錯了」?真正的瓶頸不在算力,而在網路架構。模型推理時,每個token 的生成都要重新走一遍整個網路;訓練時,任務要分割成數千個片段並行處理。如果網路架構沒配對,再多GPU 也調不動。正如Kagan 所說:GPU 已不再是晶片,而是一整台機架如果通訊延遲控制不好,本來可以用1000 個GPU 的任務,可能只能分給10 個網路本質上決定了整個集群的性能當大家都把目光都放在模型參數和算力時,Kagan 提醒我們:決定AI 系統效能的,不是看得見的硬件,而是看不見的架構配置。第一節|模型不是最重的,推理才是算力黑洞過去十年,AI 的主力戰場一直是訓練。企業、投資人、工程師,都盯著「訓練要用多少卡」「參數有多大」「一天可以跑幾輪」。但在Michael Kagan 看來,真正決定AI 系統表現表現的,已經不是訓練,而是推理。過去大家認為AI 是訓練一次、用很久;但現在不是了,推理任務比訓練更多,而且比以前更重。為什麼?因為生成式AI 的推理,不是一次回答,而是每生成一個字、每輸出一個影像像素,都要走一遍模型,重複調用群集。每個token,都需要呼叫一次全部運算資源。這意味著什麼?傳統推理是“看一張圖,識別這是隻狗”,一次計算就結束。現在是連續生成十幾秒鐘的語音、幾百字的回复、一幀幀的視頻,每個片段都要重新調用模型,壓力呈指數級增長。更關鍵的是,推理不是單純消耗算力,它對系統有兩個極高要求:一是速度敏感: 每個使用者都在等模型回話,卡頓不能接受;二是並發極高: 不是一個人問,是一百萬人同時發來指令。Kagan 舉了個簡單例子:你訓練一次模型,是一次性的成本。但你要做的是讓它服務十億人。那就是十億次推理,還是高頻的。訓練是起跑,推理才是長跑。這就是企業上AI 遇到的第一個誤判: 看上去,推理沒訓練複雜;但實際上,推理才是吞掉你資源、讓你係統崩潰的真正負載。下一節我們會講得更具體:為什麼明明卡很多,系統卻運作不起來?真正的瓶頸,是“通信”,而不是“計算”。第二節|系統撐不住?不是算力不夠,是網路拖了後腿上一節講了,AI 推理負荷比訓練更重,壓力也更持續。但Michael Kagan 告訴我們:很多人覺得是運算力不夠,真正的短板,其實在網路上。原因很簡單:你想讓一個任務從原來需要1 秒,變成1 毫秒完成,就得把它切成很多小部分,分到不同GPU 上並行執行。但這些小任務要先被發出去,執行完後還要收回。模型推理能不能快,靠的不是單塊GPU 有多強,而是這些任務在系統中能不能快速穩定地傳輸。「如果通訊成了阻礙,你就浪費了時間、能源、資源,什麼都白費了。”這個“阻礙”,不只是網路頻寬不夠。真正致命的,是延遲的不穩定,也就是Kagan 說的延遲分佈太寬。什麼意思?不是你傳得慢,而是你每次傳的速度不一樣。有時快,有時突然慢一下,這種不穩定,就會讓整個系統卡住。在Kagan 看來,如果延遲不穩定,你本來可以把任務分給1000 塊卡,只能用10 塊卡。因為系統不敢把任務放出去,它擔心傳送時來不及收回來,等一個慢的結果,就拖住了全部進度。這就是他所謂的「網路抖動」:你買了好幾百塊GPU,看起來很強,但它們在系統中排隊、等待、互相等結果,效率比你想像的低得多。如果通訊抖動嚴重,再多的GPU 也調不動,效率會斷崖式下跌。這不是參數的問題,是設計的問題。因此,不是你買的GPU 不夠,是你的網路沒配好。第三節|你下單一塊GPU,送來的可能是機架“AI 系統的核心是晶片,GPU 越強,推理就越快。”但在Michael Kagan 看來,這種想法已經完全過時了。我們今天所說的GPU,其實是一台機架大小的機器。你需要堆高機才能搬動它。不是誇張,而是真實描述今天AI 系統的最小工作單元。在過去,一顆晶片就是一塊電路板,一張顯示卡就是一個加速器。而現在,一個GPU 系統可能包含數十個處理器,數以千計的電纜連接,配套高效能內存,還有控制調度的作業系統。在輝達這套系統裡,基本構建單元已經不是一顆晶片,而是一個完整的機架。這背後的變化,來自兩個字:擴展。Kagan 把它拆成兩個方向:「向上擴展」(Scale Up):就是在一台裝置內部,把多個GPU 用高速鏈路連接起來,讓它們像一顆大晶片一樣運作。 NVIDIA 用的是NVLink 技術。「向外擴展」(Scale Out):是把多個機架、甚至多個資料中心的設備連接成一個系統,讓不同的任務可以在不同節點上並行運行,再合成結果。要實現這樣的擴展,不是插上電線就能完成的,它需要大量的軟體和網路技術協同工作。換句話說:你買的不再是一塊獨立顯示卡,而是一個系統單元。它有自己的語言(CUDA)、自己的內部通訊通道(NVLink)、自己的協作協定(InfiniBand/Spectrum),甚至還有一顆大腦來調度它們,那就是NVIDIA 的DPU(資料處理單元)。傳統IT 架構無法滿足AI 的需求,這就是為什麼照搬很難成功。第四節|不是買少了GPU,是你把系統配錯了許多企業都在說:我們也在上AI,但係統就是回應遲緩、運作不起來,最後只能歸功於我們買的卡不夠好。但問題不是晶片性能不夠,而是配錯了。企業常犯的錯誤,是把AI 系統當成了硬體疊加:模型加得夠、卡插得多、參數也大,就以為能穩定運作。但但AI 系統不是硬體的簡單相加,而是需要高度協作的整體。關鍵在於:你必須把整個資料中心當作一台機器來設計,而不是一堆裝置的集合。這意味著,你要建構的是一個連得動、調得準、能產出結果的統一調度系統。Michael Kagan 指出,這個系統能不能穩定運行,靠的不是一兩個指標,而是三件事:軟硬配合能不能跟得上?硬體組件99.999% 的時間都在工作,如果你只有幾台機器,沒問題。但你在搭10 萬張GPU 的系統,那一定有部分是壞的。大型AI 系統裡,故障是常態,不是例外。所以真正的挑戰是:你要從一開始就設計成具備故障容錯能力的高可用性系統。調度邏輯是否能涵蓋所有工作負載?不管是訓練還是推理,只要是AI 任務,都會被切成很多小部分,再分派到不同機器上處理。這個時候,你需要作業系統、DPU、通訊介面全部協同,才能做到快速、穩定、可擴充。你在運作的,已經不是單一應用,而是整個資料中心上並行跑的、協同產生的AI 任務。換句話說,不是你部署了模型,就算AI 落地了。你得能調得動模型。AI 工廠的極限,是你看不見的隱形成本現在頂級AI 資料中心已經達到上百兆瓦的能耗,正在衝刺千兆瓦級別。 冷卻、供電、熱管理、延遲控制,全都變成了決定性因素。這不是晶片的事,是整個廠房能不能承載AI。很多人以為自己在做AI 項目,其實是搭一個功耗和通訊都無法承載的IT 系統。總結起來一句話:企業的問題不是缺模型,而是沒配好讓模型運作的系統。結語|不是模型強不強,而是系統配對了沒有AI 早就不再是一個模型的事,而是一整個系統能不能運作得起來。大多數企業盯著模型、參數、顯示卡數量,卻忽略了真正的瓶頸:網路架構、任務調度和系統連結性沒配對。Michael Kagan 給了一個關鍵數據:過去兩年翻一倍,現在每年提升一個數量級。不是晶片變強了,是那些配對了系統的企業,把同樣的硬體用出了10 倍的效率。AI 已經從晶片,變成工業級智慧基礎設施。接下來的問題不是有沒有模型,而是有沒有配好網路。能不能用好AI,買夠卡是前提,但係統配對才是關鍵。(AI深度研究員)